Red-Teaming Medical AI: Systematic Adversarial Evaluation of LLM Safety Guardrails in Clinical Contexts
Questo studio presenta un quadro sistematico di valutazione avversariale per l'IA medica, rivelando che, sebbene i modelli linguistici siano generalmente robusti, rimangono vulnerabili alla manipolazione tramite impersonificazione di autorità (in particolare in contesti educativi), il che evidenzia la necessità di migliorare le difese basate sul contesto piuttosto che sulla sola accuratezza fattuale.